登入
關鍵字
#Google Genie
官方認證
北風窗
2026/09/09
•
字節秘密攻堅世界模型,對標Google Genie:為什麼所有大廠都要搶著 “造世界”
大語言模型教會 AI “讀懂文字”,視訊模型教會 AI “看懂畫面”,而世界模型,是要教會 AI理解整個物理世界如何運轉。 近日據彭博社、科創板日報等多家媒體的業內消息,字節跳動正在秘密研發一款即時空間世界模型,技術路線直接對標Google DeepMind 的 Genie 世界模型,項目由張一鳴親自督導,跨部門調集算力與研發資源,最快預計下個月迎來亮相,字節官方暫未對此消息做出正式置評。 不同於字節已經出圈的 Seedance 電影級視訊生成模型,Seedance 輸出的是一段寫死的成片視訊,播放完畢就結束。而這款新模型,目標是生成可以即時互動、可以自由漫遊的三維虛擬空間。使用者移動視角、發出語音指令,整個環境就會即時發生變化,不再是預先渲染好的固定片段。 未來這套模型計畫打通火山雲、抖音內容生態、Pico XR 硬體。落地場景直指互動式直播、觀眾可參與劇情的 AI 短劇、AI 原生遊戲;戴上 Pico 頭顯,使用者可以直接走進 AI 生成出來的虛擬世界,大量渲染計算放在雲端運行,以此降低 XR 終端的硬體門檻。
科技
#字節
#大語言模型
#Google Genie
231人
讚
留言
分享
官方認證
RexAA
2026/02/02
•
馬斯克真沒吹牛!世界模型 Genie 3 一鍵打造 GTA6 不是夢
AI 熱點一個接一個,大家光顧著看熱鬧,真正的王炸反而容易被錯過。本周,Google DeepMind 推出了打磨已久的新項目:Project Genie。這不單是一個好玩的 AI 工具,更是 Google 通往通用人工智慧(AGI)的重要一步:一個真正的「世界模型」實驗原型。目前,Project Genie 已經向美國地區 18 歲及以上的 Google AI Ultra 訂閱使用者開放使用。首先我們要搞清楚一個概念,Project Genie 生成的本質上是一個即時渲染的互動環境。它的技術底座由三部分組成:負責圖像控制的 Nano Banana Pro、負責理解語言指令的 Gemini 模型,以及負責物理反饋的 Genie 3。前兩者我們都比較熟悉,無需贅述,但 Genie 3 又該怎麼理解呢?簡單來說,它的機制和人類做夢的原理很像。我們在做夢時,大腦會建構一個包含視聽觸覺的虛擬世界。雖然夢裡的邏輯有時會跳躍,但沉浸感很強。Genie 其實就是讓電腦學會「做夢」,並且允許使用者進入這個夢境進行互動。此外,與 ChatGPT 這類基於文字統計規律的模型不同,Genie 3 本質上是一個「物理世界模型」。它雖然沒學過物理公式,但通過觀看幾百萬次物體運動的視訊,自己「學會」了重力、慣性這些物理規則。體驗 Project Genie 的方式也非常簡單。Google AI 產品宣傳委員 Josh Woodward 就演示了全過程:他先把自己的照片轉換成復古遊戲風格的角色,然後上傳到 Genie,輸入「沙漠場景」和角色描述。點選生成後,他就能以牛仔的身份在沙漠裡自由探索了。為了讓控制更精準,使用者還可以在進入前預覽環境,並調整視角。點選開始後,當你按下鍵盤方向鍵(WASD),系統會即時預測並生成前方的路徑和場景。整個過程就跟玩遊戲一樣,有所不同的是,你不僅是觀眾,更是這個世界的導演。不過,作為一個還在開發中的實驗模型,Project Genie 也有明顯短板,比如每次只能玩 60 秒。在接受的採訪播客中,Google 開發團隊解釋說,時間太長會導致畫面邏輯崩壞,產生幻覺,而且即時生成的計算成本極高。🔗https://www.youtube.com/watch?v=Ow0W3WlJxRY&t=1s因此,為了平衡體驗和成本,目前的單次探索被限制在 1 分鐘內。當然,如果你玩膩了沙漠,可以隨時修改指令,把場景變成賽博城市,而角色的動作邏輯依然會保留。前陣子馬斯克在社交平台上表示,AI 有可能讓普通人幾分鐘內生成《GTA6》。VentureTwins 也認為,2026 年將是世界模型的爆發之年。Project Genie 這種「即時視訊生成」的技術路徑,未來可能會和基於程式碼的傳統遊戲引擎分庭抗禮。有了 Project Genie,這些判斷似乎聽起來也不那麼遙遠了。圖片來自 @AngryTomtweets 🔗 https://x.com/AngryTomtweets/status/2016986111927865430在駕駛直升機時,左下角的地圖還會即時更新。圖片來自 @fofrAI 🔗 https://x.com/fofrAI/status/2016936855607136506網友 @yrzhe_top 試玩後則反饋稱,他在外星球開車「兜風」時發現,沒有宣傳視訊那麼流暢,有些延遲,自訂提示也沒生效,只能用官方預設內容。圖片來自@yrzhe_topGoogle 開發團隊也承認,目前 Genie 3 處於早期階段,物理規律模擬得還不夠準確,穿模或軌跡怪異的情況常有發生。不過 @yrzhe_top 也表示,雖然它只做到了承諾的七成,但這七成已經足夠讓人驚豔。圖片來自 @jen_w1n 🔗 https://x.com/jen\_w1n/status/2016929094517088416當然,如果只是為了做一個高配版的《我的世界》,Google 顯然不需要動用那麼多資源。Project Genie 的真正野心在於解決 AI 通往 AGI 路上的最大攔路虎,即資料枯竭與具身智能瓶頸。是的,網際網路上的高品質文字資料快被吃光了,且機器人無法通過閱讀百科全書學會洗碗,它需要肌肉記憶和物理反饋。然而,現實中獲取機器人失敗資料的成本極高,但 Genie 可以作為一個無限的合成資料生成器,模擬出十億個不同的廚房、倉庫或外星地表,讓機器人在裡面積累「肌肉記憶」,學會了再應用到現實中。類似的還有螞蟻靈波今天開放原始碼的 LingBot-VA 模型,它能在生成畫面的同時推演動作序列,讓機器人像人一樣「邊想邊做」。製作早餐、拾取螺絲、拆快遞、疊衣物、疊褲子的能力都有所長進。此外,Google 開發團隊在訪談中還暢想了更具人文關懷的應用場景,例如心理治療與教育。家長可以利用 Genie 生成一個「滿是蜘蛛的房間」,在一個絕對安全且可控的虛擬環境下幫助孩子進行脫敏練習。或者在歷史課上,直接生成一個 18 世紀的巴黎街道讓學生親歷其境。儘管現在的 Project Genie 還有畫質粗糙、時長短、延遲高以及無法多人聯機等問題,但它確實推開了那扇通往物理現實模擬的大門。回頭看 2024 年那句「世界不存在了」,最後讓它成真的,估計不是 Sora,而是 Genie。 (愛范兒)
科技
#馬斯克
#Genie 3
#GTA6
231人
讚
留言
分享
官方認證
RexAA
2026/01/30
•
Google開放世界模型Genie 3試用:AI即時生成可玩世界,人人都能創造“我的世界”
剛剛,Google開放了世界模型Genie 3實驗性研究原型Project Genie的使用,此前在25年8月,Google曾初步預覽了Genie 3的世界模型,它能夠生成多樣化的可互動環境。早期測試者已經用它創造了一系列世界和體驗,並行現了全新的使用方式。現在,通過這個專注於沉浸式世界建立的互動原型,Google決定擴大其使用範圍年滿18歲的美國Google AI Ultra訂閱使用者今天起可以率先體驗,這個原型,旨在讓使用者能夠建立、探索並重混屬於自己的互動世界體驗地址:https://labs.google/projectgenie介面長這樣:如何玩轉Project GenieProject Genie是一個原型Web應用,由Genie 3、Nano Banana Pro和Gemini共同驅動,使用者可以通過它親身體驗世界模型帶來的沉浸式感受。工作流程如下:🔵 設計: 使用文字和視覺提示設計你的世界和角色。🔵 預覽: Nano Banana Pro會生成一個圖像預覽,供你在進入前進行調整。🔵 生成: Genie 3世界模型會隨著你的移動即時生成環境。🔵 重混: 在作品庫中重新混合現有世界或發現新世界。該體驗圍繞三個核心能力建構:1. 世界草圖繪製 (World sketching)通過文字提示以及生成或上傳的圖像,建立一個生動且不斷擴展的環境。你可以建立自己的角色和世界,並定義探索方式——從步行、騎行、飛行到駕駛,以及任何其他方式為了實現更精確的控制,Google整合了“世界草圖繪製”與Nano Banana Pro。這讓使用者可以在進入世界前預覽其樣貌,並修改圖像以進行微調。你還可以定義角色的視角——如第一人稱或第三人稱——從而在進入場景前控制你的體驗方式2. 世界探索 (World exploration)你創造的世界是一個等待探索的可導航環境。當你移動時,Project Genie會根據你採取的行動即時生成前方的路徑。在穿越世界的過程中,你還可以調整鏡頭。3. 世界重混 (World remixing)你可以基於現有世界的提示詞進行建構,將其重混成新的詮釋。你也可以在作品庫或通過隨機功能探索精選世界以獲取靈感,或在它們的基礎上進行創作。完成後,你可以下載你的世界和探索過程的視訊AGI與世界模型世界模型用於模擬一個環境的動態變化,預測其演變方式以及行為所帶來的影響。儘管Google DeepMind在國際象棋或圍棋等特定環境中已擁有成熟的智能體,但建構AGI需要能夠駕馭現實世界多樣性的系統。為此,Google開發了Genie 3。與靜態3D快照中的可探索體驗不同,Genie 3能夠在你移動和與世界互動時,即時生成前方的路徑。它能為動態世界模擬物理和互動,其突破性的一致性使得模擬任何真實世界場景成為可能——從機器人技術、建模動畫和小說,到探索地點和歷史場景。基於與各行業和領域的信任測試者合作的模型研究,Google通過實驗性研究原型Project Genie邁出了下一步寫在最後Project Genie是Google Labs中的一個實驗性研究原型,由Genie 3驅動。由於Genie 3仍是一個早期的研究模型,存在一些已知的待改進領域:生成的世界可能看起來不完全逼真,或不總是嚴格遵循提示詞或圖像,或不符合現實世界的物理規律角色有時可能不太可控,或在控制時延遲較高生成時長限制在60秒內此外,去年8月宣佈的某些Genie 3模型功能,例如在你探索時可以改變世界的“可提示事件”(promptable events),尚未包含在此原型中。 (AI寒武紀)
科技
#Google
#世界模型
#Genie 3
217人
讚
留言
分享
官方認證
美股艾大叔
2025/09/17
•
AI還不具備真正的創造力 | DeepMind CEO,All-In Summit
近日,在美國All-In AI峰會上,Google DeepMind首席執行官、新晉諾貝爾獎得主Demis Hassabis接受了一場深度對話。本次圓桌對話全面探討了AI的前沿進展與未來圖景,話題涵蓋了從顛覆性的可互動世界模型Genie,到AI在機器人、科學發現、藥物研發領域的革命性應用,再到對AGI實現路徑。Demis Hassabis詳細闡述了Genie模型如何通過“逆向工程”學習並生成物理世界,顛覆了傳統3D渲染引擎的底層邏輯,更提出了未來娛樂形態將是頂尖創作者主導下的“共同創作”模式。此外,Demis Hassabis駁斥了當前AI系統已達“博士級智能”的說法,稱之為“無稽之談”,並犀利地指出其在穩定性和真正的通用性上仍有根本性缺陷。同時,他也對AI性能提升趨於停滯的觀點予以否認,認為在更廣闊的多模態領域,進步速度依然驚人。01 諾獎榮耀與Google的AI引擎室您在得知獲得諾貝爾獎時身在何處,又是如何得知的?DeepMind在龐大的Alphabet組織中扮演著怎樣的角色,您的具體職責是什麼?以及您的團隊規模有多大,人員構成是怎樣的,其中科學家和工程師的比例如何?Demis Hassabis: 那是一個非常奇妙的時刻。關於它的一切都感覺不真實,包括他們通知你的方式。他們會在全球直播前大約10分鐘才告訴你。當你接到來自瑞典的電話時,你真的會感到有些不知所措。那是每一位科學家都夢寐以求的電話。接下來的頒獎典禮,是在瑞典與王室成員共度一整周。那感覺太棒了,畢竟這項傳統已經延續了120年。而最不可思議的部分,是他們會從保險庫中取出諾貝爾獎的簽名冊,讓你在所有前輩偉人的名字旁邊簽下自己的名字。所以,當翻閱著冊子,看到Feynman、Marie Curie、Einstein和Niels Bohr等等這些名字,一頁頁地回溯歷史,然後將自己的名字也寫進那本冊子裡,那真是一個令人難以置信的瞬間。(關於是否預感會獲獎)你會聽到一些傳聞。但在當今這個時代,他們還能把消息封鎖得如此之好,確實令人驚嘆。諾貝爾獎對瑞典來說就像是國寶一樣。所以你會聽到一些說法,比如 AlphaFold 的成就或許值得這份殊榮。而且,他們不僅看重科學突破本身,也看重其在真實世界中產生的影響。而這種影響力的顯現,有時需要二三十年。所以,你永遠無法確定獲獎的時刻是否會到來,會在何時到來。因此,這確實是一個驚喜。(關於DeepMind在Alphabet中的角色)我們現在將 DeepMind,或者說合併後的 Google DeepMind,視為整個 Google 和 Alphabet 的核心引擎室。幾年前,我們將 Google 和 Alphabet 內部所有不同的人工智慧項目,包括 DeepMind,都整合到了一起,成立了一個新的部門,彙集了各個團隊的優勢。我現在通常這樣描述我們的角色:我們是整個 Google 和 Alphabet 的動力之源。我們建構的核心模型 Gemini,以及許多其他模型,比如視訊模型和互動式世界模型,現在都已接入 Google 的各個體系中。可以說,幾乎每一款產品、每一個使用者介面,背後都有我們 AI 模型的支援。如今,無論是通過 AI Overview、AI 模式還是 Gemini 應用,已有數十億使用者在與 Gemini 模型進行互動。而這僅僅是一個開始。我們正逐步將其融入 Workspace、Gmail 等產品中。所以,這對於我們來說是一個絕佳的機會,既能進行最前沿的研究,又能立刻將成果交付給數十億使用者。(關於團隊構成)我負責的 Google DeepMind 部門大約有5000人。其中,我估計超過80%是工程師和擁有博士學位的研究人員。所以,這個數字大約在三四千人。02 AI正在對我們世界的直觀物理學進行逆向工程你們前發佈一款名為Genie的世界模型,它具體是什麼?其是它與傳統3D渲染引擎有何根本不同?從長遠來看,當這類模型發展到更高階段,例如第五代時,它將引領我們走向何方,其最終的應用目標又是什麼?Demis Hassabis: 它非常驚豔。大家現在看到的所有視訊和可互動世界,實際上都是由 AI 生成的。你可以看到有人在實際控制畫面,它不是一段靜態視訊,而是完全由文字提示生成。然後,人們就可以用方向鍵和空格鍵來控制這個三維環境。所以,你在這裡看到的每一個像素都是即時生成的。在玩家或互動者到達世界的某個區域之前,那個區域是不存在的。這些豐富的細節隨後會展現出來,這個畫面是完全生成的,不是真實視訊。它生成了一個人正在粉刷自己房間的場景,在牆上塗鴉。接著,玩家會向右看,然後再看回來。世界的這個部分剛才還不存在,現在它被創造出來了。當玩家回頭看時,又能看到自己剛才留下的塗鴉痕跡。我再強調一次,你看到的每一個像素都是完全由 AI 生成的。你還可以輸入“穿著小雞服裝的人”或“一輛水上摩托艇”,模型會即時將這些元素加入到場景中。這真的相當令人震撼。(關於與3D引擎的不同)這個模型實際上是在對我們世界中的直觀物理學進行逆向工程。它觀看了數百萬個關於我們世界的視訊,包括YouTube視訊等,並僅從這些視覺資訊中,就反向推匯出了世界運行的大部分規律。它目前還不完美,但已經能作為使用者,在許許多多不同的世界裡,生成一到兩分鐘連貫的互動體驗。在後面的演示中,你還可以控制沙灘上的一隻狗,或者一隻水母,所以它的能力不侷限於和人類相關的場景。它通過觀看視訊和一些來自遊戲引擎的合成資料進行訓練,並自己完成了逆向工程。這個項目對我個人而言意義非凡,同時也讓我感到非常震撼。因為在90年代,我職業生涯早期曾為視訊遊戲編寫過AI和圖形引擎。我至今還記得,當時要手動編寫所有多邊形和物理引擎是多麼困難。而現在看到Genie毫不費力地就實現了這一切,水面的反射、材質的流動方式、物體的行為等等,全都自然天成,這實在是太神奇了。(關於模型的未來方向)我們之所以建構這類模型,是因為我們始終認為,儘管我們像其他團隊一樣,在Gemini這樣的大語言模型上不斷取得進展,但從一開始,我們就希望Gemini是一個多模態模型。我們希望它能接收任何類型的輸入,無論是圖像、音訊還是視訊,並且能輸出任何內容。我們對此非常感興趣,因為要讓AI實現真正的通用,要建構AGI,我們認為AGI系統必須能夠理解我們周圍的物理世界,而不僅僅是語言或數學等抽象世界。當然,這對於機器人技術的發展也至關重要,這可能正是當前機器人技術所缺失的環節。同樣的道理也適用於智能眼鏡這類裝置,一個能在日常生活中為你提供幫助的智能眼鏡助手,必須能夠理解你所處的物理環境,以及我們世界中直觀物理學的運作方式。因此,我們認為,建構像Genie這樣的模型,以及我們最好的文字到視訊模型Veo,都是我們建構世界模型的具體體現。這些模型能夠理解世界的動態和物理規律。如果你的系統能夠生成一個世界,那就證明它已經理解了那個世界的運行法則。03 AGI系統必須能夠理解我們周圍的物理世界Genie這類世界模型最終是否會通往機器人領域?能否介紹一下當前視覺-語言-行動模型的最新進展是怎樣的?一個能夠通過攝影機觀察世界,通過自然語言接收指令,並據此在物理世界中執行相應動作的通用系統,目前發展到了什麼階段?Demis Hassabis: 完全正確。如果你體驗一下Gemini的Gemini Live版本,將手機攝影機對準你周圍的世界,你會發現它對物理世界的理解已經達到了一種近乎神奇的程度。你可以將下一步想像為,把這種能力整合到像眼鏡這樣更便攜的裝置中。到那時,它就會成為一個日常助手,可以在你逛街時為你推薦事物,或者我們可以將它嵌入到Google地圖中。在機器人領域,我們建構了名為“Gemini機器人模型”的系統,這可以看作是在Gemini的基礎上,用額外的機器人資料進行微調後的版本。這個項目最酷的一點,也是我們今年夏天通過一些演示所展示的,是我們設定了一些桌面場景,有兩隻機械臂在桌面上與物體互動,你可以直接和機器人對話。比如,你可以說“把黃色的物體放進紅色的桶裡”,它就能理解這條語言指令,並將其轉化為具體的機械動作。這就是多模態模型相比於純粹的機器人專用模型所具備的強大之處,它能夠將對真實世界的理解融入到與你的互動中。所以最終,這種模型既能提供你所需要的使用者介面體驗,也能賦予機器人安全探索世界所必需的理解力。04 “機器人Android系統”與人形設計的價值是否意味著你們最終能夠打造出一種通用機器人領域的“Android”系統,一個能夠賦能大量機器人裝置和公司的底層作業系統?您認為人形是機器人一種好的外形設計嗎,這種形態在現實世界中是否有其存在的意義?對於未來五到七年,您預計機器人的普及規模會達到何種量級,是成千上萬,還是數百萬甚至上億?Demis Hassabis:這當然是我們正在追求的策略之一,可以稱之為一種“Android模式”,即為整個機器人領域提供一個近乎作業系統的底層。但除此之外,還有一些非常有趣的方向,比如將我們最新的模型與特定的機器人類型和設計進行垂直整合,並進行某種端到端的學習。所以,這兩種策略都非常有前景,我們也在同時推進。(關於人形設計的價值)我認為未來這兩者都會有市場。實際上,大概在五到十年前,我的看法是,我們會為不同的任務設計特定形態的機器人。而且我認為在工業領域,工業機器人肯定會是這樣,你可以根據具體任務來最佳化機器人的形態,無論是在實驗室還是在生產線上,你需要的機器人類型都會大相逕庭。但另一方面,對於通用或個人使用的機器人,要讓它們與我們的日常生活環境互動,人形形態可能就非常重要了。因為,我們身邊的物理世界顯然是圍繞人類的需求來設計的。比如台階、門廊,所有這些都是為我們自己設計的。與其去改造現實世界中的這一切,設計出一種能與我們現有世界無縫協作的機器人形態,可能會是更容易的方案。所以我認為,有充分的理由相信,對於這類任務,人形形態可能至關重要。當然,我也認為,特種形態的機器人同樣會有一席之地。(關於機器人普及的時間和規模)我確實有,並且在這個問題上思考了很久。我感覺,我們在機器人技術領域仍處於比較早期的階段。我相信在未來幾年內,機器人領域會出現一個真正令人驚嘆的“高光時刻”。但我認為,演算法還需要進一步發展。這些機器人模型所依賴的通用模型,需要變得更強大、更可靠,需要更好地理解周圍的世界。我相信這在未來幾年內能夠實現。此外,在硬體方面,關鍵問題在於,我認為我們最終會擁有數百萬台機器人來服務社會、提高生產力。但關鍵在於,當你和硬體專家交流時,他們會問:硬體發展到那個節點,才算達到了適合大規模量產的水平?因為一旦你開始投資建廠,準備生產成千上萬台特定型號的機器人,再想快速迭代更新機器人設計就變得非常困難了。所以這是一個時機問題,如果你過早地決定量產,可能六個月後就會出現一款更可靠、更出色、更靈巧的下一代機器人。如果用電腦領域的發展來類比,我們當前所處的階段,是不是有點像上世紀70年代,PC-DOS系統剛剛出現的那個時期?有這個可能。或許我們確實處於類似的早期階段,但關鍵區別在於發展的速度。我們現在用一年時間就走完了過去十年的路,所以必須進行快速迭代。可以說,現在的一年,就相當於過去的十年。05 如今的AI還不具備真正的創造力在科學領域,AI有那些最讓您感到興奮的應用前景和潛在突破,我們還需要什麼樣的模型才能實現這些突破?當前AI在科學發現的能力上還缺失那些關鍵環節?另外,從人類的角度來看,您如何定義“創造力”這一概念?Demis Hassabis: 利用AI加速科學發現並助力人類健康等事業,正是我為AI奮鬥終生的原因。我認為這是AI最重要的使命。我相信,如果我們能以正確的方式建構AGI,它將成為推動科學發展的終極工具。在DeepMind,我們的工作正是在不斷為此開闢道路。其中最著名的當然是AlphaFold,但實際上,我們已經將AI系統應用於眾多科學領域,例如材料設計、輔助控制核聚變反應堆中的電漿體、天氣預測以及解答奧數難題。這些複雜的難題,基本上用同類型的系統,再經過一些額外的微調就能解決。所以我認為,我們目前對AI潛力的探索還僅僅是冰山一角,還有很多能力尚待開發。在我看來,如今的AI還不具備真正的創造力,因為它還無法提出新的科學猜想或假設。它或許可以證明你給定的命題,但無法自己構想出全新的想法或理論。因此,我認為這恰恰是檢驗AGI的標準之一。(關於創造力的定義)我認為創造力是我們常在歷史上最傑出的科學家和藝術家身上所推崇的那種直覺的飛躍。它或許源於類比或類比推理。關於我們人類科學家如何實現這一點,心理學和神經科學領域有許多理論。但一個很好的測試方法是,給一個現代AI系統設定1901年的知識截止點,看它能否像愛因斯坦在1905年那樣提出狹義相對論。如果它做到了,那就意味著我們觸及到了非常本質的東西,或許就離AGI不遠了。另一個例子是我們的AlphaGo程序,它曾擊敗世界圍棋冠軍。它不僅贏得了比賽,還為圍棋這項運動開創了前所未有的新策略,比如在第二局下出的著名的第37手,如今已成為棋界研究的經典。但是,一個AI系統能否創造出一款像圍棋這樣優雅、精妙、富有美感的遊戲,而不僅僅是發明一種新策略呢?目前來看,答案是否定的。所以我認為,這正是真正的通用系統,也就是AGI系統所缺失的能力之一,它理應也具備這些能力。06 “博士級智能”是無稽之談很多人認為AGI將在幾年內實現,您似乎不完全認同這個觀點。能否從系統架構的理解出發,具體分析一下當前實現AGI還缺少那些關鍵環節,瓶頸究竟在那裡?與此同時,有報告和評估體係指出,大語言模型的性能正在趨同,且每一代模型性能的提升速度似乎在放緩,您認為這個說法基本屬實嗎?Demis Hassabis: 我認為這裡的根本問題在於,我們能否模仿最頂尖人類科學家所能實現的那種直覺飛躍,而不僅僅是漸進式的提升。我常說,一個偉大的科學家與一個優秀的科學家之間的區別在於,儘管兩者都具備很強的技術能力,但偉大的科學家更具創造力。他們或許能從另一個學科領域發現某種模式,並將其通過類比或模式匹配應用到自己正在研究的問題上。我相信AI終有一天能做到這一點,但目前它還不具備實現這種突破所必需的推理能力和某些思維能力。我還認為,我們目前缺乏穩定性。你常聽到我們的一些競爭對手說,現在的這些是“博士級智能”。我認為這種說法是無稽之恩。它們不是博士級智能。它們或許在某些方面具備博士水準的能力,但遠非在所有領域都能穩定地達到博士水平,而這恰恰是通用智能的定義。事實上,我們和今天的聊天機器人互動時都會發現,只要換種方式提問,它們甚至會在高中數學或簡單計數這類問題上犯低級錯誤。這對於一個真正的AGI來說是不應該發生的。所以我認為,我們距離一個能做到上述所有事情的AGI,可能還有五到十年的時間。另一個缺失的關鍵是持續學習,即系統能夠線上學習新知識或隨時調整自身行為的能力。我認為,許多這類核心能力目前仍然缺失。或許Scaling Law能幫助我們實現目標,但如果讓我預測的話,我認為我們可能還需要一到兩個關鍵的理論突破,而這大概需要未來五年左右的時間。(關於模型性能趨同和提升放緩的說法)不,我們在內部並沒有看到這種情況,我們依然保持著極快的進步速度。而且,我們看待問題的視野也更廣。你可以看看我們的Genie、Veo等模型。07 AI創作的兩個趨勢以Nano-Banana為例,這類先進的圖像生成工具不僅效果驚人,更重要的是其指令理解的精準性和結果的一致性,這是否意味著我們正在走向一個“創造力民主化”的未來,讓每個人都能輕鬆創作?在推動工具普及的同時,這些AI工具又將如何賦能頂尖的專業創作者?未來我們會進入一個完全個性化的娛樂世界,每個人都能即時生成自己想要的內容,還是社會仍然需要由創作者提供、供大家共同分享的文化產品?從文化角度看,我們是會各自沉浸在自己的虛擬世界,還是會繼續擁有共同的故事?Demis Hassabis: Nano-Banana的效果簡直不可思議。我認為很多創意工具的未來就是這樣:你只需要憑感覺與它互動,或者直接和它對話就行了。而且它們的表現會足夠穩定,就拿Nano-Banana來說,它之所以如此出色,不僅在於它是頂級的、最先進的圖像生成器,更在於它的一致性。它能精準理解並執行你的指令,在你要求改變某個部分時,能保持其他所有元素不變。這樣你就可以通過不斷迭代,最終得到你想要的效果。我認為這就是未來創意工具的形態,它指明了發展的方向,人們非常喜愛它,也樂於用它來創作。這實現了“創造力的民主化”,我認為這非常了不起。我記得小時候,為了學Photoshop,我得買很多書,照著書學習如何從圖像中移除物體、如何填充、如何羽化等複雜操作。現在,任何人用Nano-Banana都能做到,他們只需向軟體描述想讓它做什麼,它就能自動完成。(關於賦能專業創作者)未來會出現兩個趨勢。一方面是這些創作工具的普及化,讓每個人都能輕鬆上手和創作,而不必像我們過去那樣去學習極其複雜的使用者體驗和使用者介面。但另一方面,我們也正在與頂尖的電影製作人、創意人士和藝術家合作,比如我的好朋友、著名導演Darren Aronofsky。他們正在幫助我們設計新一代的工具,告訴我們需要那些功能。他和他的團隊已經在使用Veo等工具來製作電影。通過觀察並與他們合作,我們獲益匪淺。我們發現,這些工具也極大地提升了頂尖專業人士的能力和效率。那些最優秀的專業創作者,他們的生產力突然之間可以提升10倍甚至100倍。他們可以低成本地嘗試腦海中各式各樣的創意,並最終創作出理想的作品。所以我認為,這兩方面是平行不悖的。我們既在為普通使用者和YouTube博主們推動工具的普及,同時,在高端專業領域,情況也同樣如此。要用好這些工具,並獲得頂級輸出,並非人人都能做到,這本身也需要技巧,更需要頂尖創者的視野、敘事能力和獨特風格。我認為,這些工具讓他們如虎添翼,他們也非常享受這種能快速迭代創作過程的體驗。(關於未來娛樂的形態)我確實預見到一個新世界的到來。我從90年代起就以遊戲設計師和程式設計師的身份入行,所以我經常思考這個問題。我認為我們正在見證的,正是娛樂行業未來的開端,它可能會催生一種全新的內容類型或藝術形式。在這種形式中,存在著一定程度的“共同創作”。我仍然相信,頂尖的、富有遠見的創作者依然會是核心,他們將創造出引人入勝的體驗和動態的故事情節,即便使用相同的工具,他們作品的質量也會遠超普通人。因此,未來可能會有數百萬人沉浸在這些大師建構的世界裡,但同時,他們或許也能參與到這個世界某些部分的共同創造中。而那位主要的創作者,其角色更像是一個世界的“主編”。這就是我預見的未來幾年可能發生的事,而且我也很想用Genie這樣的技術親自去探索這個方向。08 AI的能源挑戰能否介紹一下您負責的另一家公司Isomorphic及其在藥物發現領域的革新性工作?這些AI發現的候選藥物預計何時能進入臨床試驗階段?在技術層面,這項工作多大程度上需要開發新的模型架構,你們是如何將機率性模型與確定性模型相結合的?此外,關於AI的能源需求問題,您認為模型和硬體的進步能否有效降低能耗?最後,請您描繪一下十年後,在AI影響下的世界圖景。Demis Hassabis: 當然可以。我還負責營運Isomorphic,這是我們基於AlphaFold在蛋白質摺疊領域的突破而分拆成立的一家公司,旨在徹底革新藥物發現的過程。當然,瞭解蛋白質的結構只是藥物發現的第一步。你可以將Isomorphic想像成一個平台,它正在建構一系列與AlphaFold功能銜接的系統,用於解決後續問題,例如設計出能夠精準結合蛋白質靶點又沒有副作用的化學分子。我認為在未來十年,我們有望將藥物發現所需的時間從數年甚至十年,縮短到幾周乃至幾天。(關於進入臨床試驗的時間點)我們目前正在搭建這個平台,並與禮來(Eli Lilly)和諾華(Novartis)等頂尖藥企建立了良好的合作關係。此外,我們也有自己的內部藥物研發項目。我預計,我們將在明年某個時間點進入臨床前階段。我們將候選藥物交付給製藥公司,由他們接手推進後續的開發。我們目前正致力於癌症、免疫學和腫瘤學等領域的研究,並與MD Anderson癌症中心等機構合作。(關於混合模型架構)這是個非常好的問題。實際上,至少在目前以及未來五年左右,我們建構的都是所謂的混合模型。AlphaFold本身就是一個混合模型。它有一個學習元件,也就是你提到的機率性部分,它基於神經網路和Transformer架構,從所有可用資料中進行學習。但與此同時,在生物和化學的許多場景中,我們並沒有足夠的資料來讓模型從零學起。因此,你還必須將一些已知的化學和物理規則內建到模型中。例如,在AlphaFold中,我們設定了原子間化學鍵的角度限制,並確保模型理解原子之間不能發生重疊等基本物理原則。理論上,模型或許也能自己學會這些,但這會極大浪費它的學習能力。因此,將這些規則作為硬性約束,效率會高得多。現在,所有混合系統的難點都在於此——AlphaGo也是一個混合系統,它有一個學習圍棋棋局模式的神經網路,上層則是一個用於規劃的蒙特卡洛樹搜尋演算法。真正的挑戰在於,你如何將一個學習系統與一個更偏向人工設計的定製化系統完美地結合起來,並讓它們高效協同工作?這其實非常困難。我認為最終的目標是,當你通過混合系統驗證了某個元件的有效性之後,你應該想辦法將這個元件的能力整合、“反哺”到學習元件中去。因為,如果能實現端到端學習,直接從原始資料一步到位地預測出最終結果,那永遠是更好的方案。所以,一旦你通過某個混合系統取得進展,你就要回頭去反思,看看能否將這一成功經驗和知識,完全融入到學習系統本身。(關於AI的能源需求問題)有趣的是,我認為這兩種趨勢是同時存在的。一方面,我們,尤其是在Google和DeepMind,極其注重提升模型的效率和性能,因為我們有大量的內部應用場景。例如,我們需要每天為全球數十億使用者提供AI Overviews服務,這就要求系統必須做到極致的高效、低延遲和低服務成本。為此,我們開創了許多技術,比如“蒸餾”,也就是用一個強大的內部大模型來訓練一個更小的模型,讓小模型模仿大模型的行為。如果你看過去兩年的進展,要達到同等性能,模型的效率已經提升了10倍,甚至100倍。那麼,為什麼總需求沒有下降呢?因為我們離AGI還很遠。這意味著在不斷提升推理服務效率的同時,我們還希望在更大規模上訓練和試驗新的前沿模型。所以,這兩個方面的情況都是真實的。但最終,從能源的角度看,我認為AI系統對能源和氣候變化等領域的貢獻,將遠遠超過它自身的消耗。AI將在提升電網系統效率、設計新材料、發現新能源等方面發揮巨大作用。我相信,在未來十年,AI在這些領域的貢獻所帶來的價值,將遠遠超過它今天所消耗的能源。(關於十年後的世界)在AI領域,十年太漫長了,有時十周就如同一個時代。但我確實認為,未來十年內我們將迎來真正的、完全的AGI。我認為,它的到來將開啟一個科學的全新黃金時代,一場新的文藝復興。屆時,我們將看到它為從能源到人類健康的各個領域帶來深遠的益處。 (數字開物)
科技
#Google
#Demis Hassabis
#深度對話
240人
讚
留言
分享
官方認證
美股艾大叔
2025/08/17
•
剛剛!Google內部揭秘Genie 3:Sora後最強AI爆款,開啟世界模型新時代
【新智元導讀】Genie 3來了!這或許是最接近「模擬世界」的AI魔法。只需一句話,它就能生成一個動態、可互動的世界——角色能互動、下水會濺起水花,甚至還能記住一分鐘前的細節。DeepMind研究者直言:Genie 3是通向AGI的關鍵一步。Genie 3是有史以來最先進的世界模型之一。僅通過文字,它能夠即時生成完全互動、高度一致的世界。它不僅是DeepMind積累的結晶,還是通向AGI和具身智能體的關鍵一步。但Genie 3是如何建構的?未來的世界模型又是什麼樣?剛剛,GoogleDeepMind的研究科學家Jack Parker-Holder和研究總監Shlomi Fruchter,在a16z的訪談中,分享了他們的觀點。這次對話提供了對Genie 3的第一手洞察。主持人Justine Moore發推表示:「Genie 3在網路上引發熱潮」。他總結了深入探討的要點:Genie3是由兩個DeepMind項目(Veo 2和Genie 2)合作完成的成果。即時、互動的世界模型有很多潛在應用。但應用並不是推動研究的主要動力——它們是從使用者使用模型的過程中自然湧現出來的。Genie 3可以保留最長達一分鐘的空間記憶。物理規律是模型的「自然產物」,並會隨著訓練資料的規模和深度而不斷提升。目前還沒有一個「終極模型」能夠同時具備Veo 3和Genie 3的所有能力。Genie 3:AI新魔法如果說LLM的原生圖像編輯功能,「動動嘴PS」是「言出法隨」,那Genie 3這次的新特性叫什麼?只需輸入文字提示,Genie 3即可生成動態世界。使用者可以即時進行探索,每秒高達24幀,解析度為720p。十多年來,GoogleDeepMind一直致力於模擬環境的研究。Genie 3是他們最新最強的「世界模型」,是通向通用人工智慧(AGI)的關鍵一步,因為它能讓AI智能體在無限豐富的模擬環境中進行訓練。去年,他們推出了首批基礎世界模型Genie 1和Genie 2,它們能為智能體生成全新的環境。此外,他們還通過Veo 2和Veo 3等視訊生成模型,不斷提升對直觀物理的理解能力。這些模型在世界模擬的不同能力上都取得了進展。Genie 3是Google首個支援即時互動的世界模型,同時提升了一致性和真實感。在生成視訊時長、世界一致性、內容的多樣性、特殊記憶等多個方面,Genie 3都實現了突破。它甚至可以讓個人創造自己的遊戲世界、訓練強化學習的智能體、機器人研究等。所有這些應用基本上都源於一個核心能力:只用幾句話就能生成一個完整的世界。最關鍵的新特性是:特殊記憶。比如:一個角色拿著刷子在牆上刷漆,然後他移動到牆的另一邊去刷,接著又回到原來的位置,結果之前刷的痕跡還在。特殊記憶(special memory)是DeepMind團隊有意設計的目標,但最終的效果好得出乎意料。即便是參與Genie 3的內部成員,第一次看到上面刷牆的示例時也不敢相信,需要再三觀看、逐幀檢查,才確定這真的是模型生成的。Genie 3的一致性非常高:建築物左側的樹木在整個互動過程中始終保持一致,即使它們時而進入視野時而消失其實,Genie 2就已經具備了一些「記憶能力」。但當時,整個AI界太多令人激動的模型發佈,比如Veo 2模型幾天後也發佈了。而且,當時Google主打的賣點是「可以生成新的世界」,所以記憶能力就沒被強調出來。到了Genie 3,在「記憶」上,GoogleDeepMind下了更大的決心,明確地把「增強記憶能力」作為核心目標之一。當時設定的目標是:超過一分鐘的記憶、支援「即時生成」、還能提升「解析度」。其實,這幾個目標本身是互相矛盾的,但Google無所畏懼。說實話,直到項目快結束時,在看到最終樣本的那一刻,他們依然感到震撼。這種成果即使是預期中的,真的實現的時候還是非常令人興奮。畢竟,研究項目永遠不會有百分百的確定性。在設計上,他們還有一個明確的方向,就是不採用「顯式表示法」。市面上已有一些方法,比如用NeRF或Gaussian Splatting等技術,通過建構明確的3D世界結構,來達到一致性。這些方法很好,在某些應用上效果不錯。但他們堅持讓模型「逐幀生成」,這種方式對模型的泛化能力、適應多樣世界的能力更有幫助。智能湧現,驚喜不斷就像其他生成式模型一樣,隨著Scaling,效果確實會提升,這已經不是什麼秘密了。儘管不如語言模型在推理能力上的湧現表現,Genie 3依然湧現出一些令人驚訝的行為。比如說,如果一個角色靠近一扇門,模型可能就會「推測」角色應該打開門;這類符合人類直覺的行為,模型現在能在一定程度上表現出來了。還有就是對語言的理解在不斷變好,生成的內容也越來越真實,視覺效果更自然。從Genie 2到Genie 3的提升非常明顯,特別是在「模擬現實世界能力」上有巨大飛躍。比如物理效果的表現——像水的模擬、光照的變化,都非常驚豔。現在已經到了一個地步,那怕是非專業人士,看了之後也會覺得是真實拍攝的視訊。👇這太驚人了。而在Genie 2時代,模型雖然大致能表現出物體該有的行為,但你還是一眼能看出「這是AI生成的,不是真的」。現在的視訊真假難辨,進步真的很大了。在「地形多樣性」問題:比如模型需要理解在沙地上行走、在下坡滑雪、在水中游泳,這些動作和物理反饋應該是不一樣的。Google團隊發現這些行為很多都是規模和資料廣度所帶來的「湧現能力」。換句話說,他們並沒有為這些行為做專門的訓練或設計,而是模型自己「學」出來的。它通過足夠豐富的訓練資料,掌握了這個「世界」的通用常識。大多數時候,它表現非常不錯。比如下面的例子:在滑雪時,角色在下坡時速度會變快,而試圖上坡時就會變慢,甚至爬不上去;下水後,角色一般會開始游泳或濺起水花;靠近水坑時,模型通常也會讓角色穿上雨靴。這些行為都非常自然,和人類對真實世界的理解非常一致,而這些都是模型自己學會的,真的讓人覺得像魔法一樣。這裡還有一個有趣的權衡:既能保持世界的「物理一致性」,同時也能忠實地執行使用者的提示詞。對視訊模型來說,「低機率事件」本來很難,但Genie 3依然能有不錯的表現。這正是它的魅力所在:即便是一些現實中不太可能發生的場景,Genie 3也能讓你如臨其境,而不是僅僅生成一個和你身邊環境一樣的無聊視訊。在「指令跟隨/文字對齊」,Genie 3也得到了提升,這主要得益於DeepMind內部不同項目(特別是Veo項目)的經驗遷移和知識共享。這種跨團隊協作是DeepMind的優勢。世界模型是讓智能體走向現實世界最快的路徑。Genie 3朝著這個目標邁出了一大步。那Genie 4、Genie 5的新特性有那些設想?未來的關鍵真實感和互動性但總的來說,Genie 3團隊最關注的始終是一件事:讓模型本身變得儘可能強大,讓它能產生更廣泛的影響,然後把創造應用的機會交給其他團隊。他們表示最終會開放Genie 3模型。未來確實讓人特別興奮,但也必須承認,世界模型距離真正「精準模擬現實世界」還有很大差距。比如,把一個人放進生成的世界裡,讓他隨心所欲地做任何事情,我們還遠遠做不到。還有很多工作要做,才能讓虛擬世界的真實感和自由度接近現實。應用還有很多,關鍵在於能否精準模擬世界,並把人放進其中。也許還能從「第三視角」觀察自己,或者與虛擬智能體互動。他們還透露真實感和互動性是未來的關鍵。現在機器人領域最大的瓶頸之一就是資料:能收集到的資料非常有限。而Genie 3能生成幾乎無限的場景,這樣一來機器人就能在虛擬世界裡學習,而不再侷限於現實中能採集到的視訊。這個想法真的很令人興奮。最後一個問題:人類是不是生活在某種模擬中?這個問題被問過很多次,得到了「哲學化」的回答:如果真是模擬,那它運行在完全不同的硬體之上如果人類真的生活在一個模擬世界裡,那它絕對不是運行在現在的硬體上的。因為我們的世界是連續的,而不是數位化的。所有的感知都是連續的訊號。也許,在量子層面會有一些「硬體限制」,但至少和我們現在的電腦完全不同。或許未來量子電腦,才是運行我們這個模擬世界的真正平台。 (新智元)
科技
#Google
#Genie 3
#Sora
230人
讚
留言
分享
官方認證
RexAA
2025/08/06
•
Google DeepMind深夜放核彈:世界模型Genie 3登場,重新定義“生成式AI”
剛剛Google DeepMind 宣佈推出第三代通用的世界模型 Genie 3 ,可以生成前所未有的多樣化互動式環境,給出文字提示,Genie 3 可以生成動態世界,可以以每秒 24 幀的速度即時導航,並以 720p 的解析度保持幾分鐘的一致性Genie 3將首先以有限研究預覽的形式,向一小部分學者和創作者開放 Genie 3,以收集關鍵反饋Genie 3 的突破DeepMind 在模擬環境領域已有十餘年的深厚積累。從訓練能玩轉即時戰略遊戲的 AI,到為機器人開發開放式學習環境,這些研究都指向了一個共同的目標:建構強大的世界模型。與前代模型(如 Genie 1/2)和視訊生成模型(如 Veo 2,Veo 3對直覺物理學的深刻理解)相比,Genie 3 是第一個允許即時互動的世界模型,同時與 Genie 2 相比,其一致性和真實感也得到了提升核心能力模擬世界的物理特性: Genie 3 對物理規律有深刻理解,能逼真地模擬水流、光影變化以及複雜的環境互動,例如直升機在懸崖瀑布邊小心翼翼地機動模擬自然世界: 從冰川湖畔充滿生機的生態系統,到幻想世界中可愛的毛茸茸生物在彩虹橋上跳躍,Genie 3 能將想像力轉化為可探索的現實動畫和小說建模: :可以發揮想像力,創造奇幻的場景和富有表現力的動畫角色探索不同地域與歷史場景:模型能超越地理和時間的限制,帶領使用者探索不同地點和歷史時代,無論是身穿翼裝飛越雪山,還是置身於歷史悠久的古城突破即時性能的極限:實現高度的可控性和即時互動性,在每一幀的自回歸生成過程中,模型必須考慮先前生成的隨時間增長的軌跡。例如,如果使用者在一分鐘後重新訪問某個位置,則模型必須引用一分鐘前的相關資訊。為了實現即時互動性,這種計算必須每秒進行多次,以響應新使用者輸入的到來長時程環境一致性: 為了讓人工智慧生成的世界身臨其境,它們必須在很長一段時間內保持物理上的一致性。然而,自動回歸生成環境通常比生成整個視訊更難的技術問題,因為不精準之處往往會隨著時間的推移而累積,Genie 3 環境在幾分鐘內基本保持一致,視覺記憶可以追溯到一分鐘前,Genie 3 生成的世界更加動態和豐富,因為它們是根據使用者的世界描述和作逐幀建立的可提示的世界事件 (Promptable World Events): 除了導航輸入之外,Genie 3 還支援一種更具表現力的基於文字的互動形式,稱之為可提示的世界事件 。可提示的世界事件可以改變生成的世界,例如改變天氣條件或引入新的物體和角色,從而增強導航控制的體驗,這種能力還增加了反事實或“假設”場景的廣度,代理可以使用這些場景從經驗中學習來處理意外情況賦能具身智能體研究Genie 3 的終極目標之一是為具身智能體(Embodied Agent)提供一個無限豐富的訓練場。DeepMind 已將其與通用智能體 SIMA進行結合測試。研究人員可以為 SIMA 設定一個目標(如在面包房裡找到工業攪拌機),SIMA 則通過向 Genie 3 傳送導航指令來嘗試完成任務。Genie 3 像一個真正的世界一樣,根據 SIMA 的行為即時反饋結果,從而讓智能體在海量的what if場景中學習和成長當前的侷限性Genie 3目前存在的侷限性:行動空間有限: 智能體的直接行動範圍仍受限制缺乏多智能體模擬: 難以精確模擬多個獨立智能體之間的複雜互動地理精度不足: 無法完美復現實世界的地理位置文字渲染較差: 除非在初始提示中指定,否則生成的文字通常模糊不清互動時長有限: 目前支援數分鐘的連續互動,而非數小時 (AI寒武紀)
科技
#Google
#DeepMind
#Genie 3
230人
讚
留言
分享